1 Contenido de la clase
Ojo con el nombre. Aunque la clase se titula "Incertidumbre", su contenido no es el capítulo de incertidumbre/probabilidad de Russell y Norvig, sino los juegos con azar y expectimax (§5.5) más la teoría de la utilidad (cap. 16, "Toma de decisiones sencillas"). La "Incertidumbre" del libro (probabilidad) es otro capítulo posterior.
Incertidumbre: ¿qué hará el adversario? [05:25-06:20]
En la búsqueda con adversarios no conocemos lo que está pensando el otro jugador (y tal vez ellos tampoco lo saben). Una alternativa es imaginar al adversario más capacitado posible, como hace minimax: asumir que siempre elegirá lo peor para nosotros.
Pero esa suposición puede ser muy conservadora: si damos por hecho el peor escenario para elegir nuestra acción, terminamos atados a la peor posibilidad, incluso cuando el resultado real depende de muchas cosas — incluido el azar.
Búsqueda expectimax [06:51-09:24]
La búsqueda expectimax se usa cuando no sabemos el resultado de una acción: hay eventos aleatorios, adversarios impredecibles y las acciones pueden fallar. En este esquema los valores representan el caso medio (no el peor caso):
- Los nodos max y min se comportan igual que en minimax (maximizar/minimizar).
- Los nodos chance (aleatorios) tienen un resultado aleatorio: calculan la utilidad esperada ponderando cada sucesor por su probabilidad.
V(nodo chance) = Σ P(sucesor) × V(sucesor) [21:32-21:49]
Ejemplo del pizarrón: con probabilidad ½ se alcanza el valor 9 y con probabilidad ½ el valor 100, el valor del nodo es 0.5·9 + 0.5·100 = 54.5 [21:49-22:03]. Así, la elección ya no se decide por el peor caso sino por el valor esperado.
¿De dónde salen las probabilidades? De una distribución uniforme, de un modelo sofisticado basado en datos, o pueden estar "dadas mágicamente" [29:08].
¿Cuándo usar expectimax y cuándo podar? [28:02-28:19]
Expectimax conviene cuando la decisión depende de la aleatoriedad y no solo del adversario. En cuanto a la poda, es mucho más delicada que en alfa-beta porque cualquier rama contribuye a la esperanza (aunque tenga una probabilidad ínfima, p. ej. 1×10⁻²⁰). Aun así sí existe poda cuando se conocen cotas de los valores: si una rama no puede cambiar la decisión, se descarta. En el libro el algoritmo se llama a veces expectiminimax (intercala MAX, MIN y chance) [27:16-27:22].
Generalizando a otros juegos: tuplas de utilidad [41:09-41:44]
Con más de dos jugadores (rojos, azules, etc.) los nodos terminales tienen tuplas de utilidad, una entrada por jugador, y cada jugador maximiza su propia utilidad. Esto puede dar lugar a interacciones complicadas entre agentes. Estos modelos no solo aplican a juegos: también a decisiones económicas o políticas entre actores (p. ej. países), aunque los ejemplos concretos de ese bloque quedaron poco claros en la grabación.
¿Qué utilidades utilizar? [47:55-48:37]
- La escala: para peores escenarios la escala de la función no importa; para casos medios la magnitud debe ser significativa. Normalmente se normalizan a [0,1].
- ¿De dónde vienen? De juegos de suma cero (+1/−1), de utilidades que resuman las metas de cada agente, o de dinero. Bajo ciertos axiomas, las preferencias de un agente pueden resumirse en una función de utilidad.
Preferencias, loterías y axiomas de racionalidad [48:40-62:51]
Un agente debe tener preferencias sobre resultados (A, B, …) y sobre loterías: situaciones con resultados bajo incertidumbre, notadas L = (p, A; 1−p, B). Se usa la notación A ≻ B (se prefiere A sobre B) y A ~ B (indiferencia).
Los axiomas de racionalidad son:
- Ordenabilidad: A ≻ B ∨ B ≻ A ∨ A ~ B (siempre se puede comparar).
- Transitividad: A ≻ B ∧ B ≻ C ⇒ A ≻ C.
- Continuidad: A ≻ B ≻ C ⇒ ∃p: (p, A; 1−p, C) ~ B (existe una probabilidad que hace indiferente la lotería).
- Sustituibilidad: A ~ B ⇒ (p, A; 1−p, C) ~ (p, B; 1−p, C).
- Monotonicidad: A ≻ B ⇒ (p ≥ q ⇔ (p, A; 1−p, B) ≽ (q, A; 1−q, B)).
- Reducción de loterías compuestas: una lotería de loterías equivale a la lotería simple con las probabilidades multiplicadas.
Las paradojas de Allais y Ellsberg muestran que las preferencias humanas suelen violar estos axiomas.
Máxima utilidad esperada (MEU) [63:58-64:51]
Teorema: dado cualquier conjunto de preferencias que satisfaga los axiomas, existe una función real U tal que U(A) ≥ U(B) ⇔ A ≽ B y U((p₁,S₁; …; pₙ,Sₙ)) = Σ pᵢ·U(Sᵢ). El principio es elegir la acción que maximice la utilidad esperada.
Ejemplo con dinero: la mayoría prefiere "seguro $3k" sobre "0.8 de $4k" y prefiere "0.25 de $3k" sobre "0.20 de $4k". Con U($0)=0 esas preferencias llevan a U($3k) > 0.8·U($4k) y a la vez 0.8·U($4k) > U($3k): una contradicción que muestra que las preferencias humanas no siempre cumplen los axiomas.
Actitud frente al riesgo: con U(dinero) cóncava el agente es averso al riesgo (rechaza una apuesta justa); con U lineal es neutral; con U convexa es amante del riesgo. La forma de U —no solo el valor esperado— explica la decisión.
Cierre [64:51]
Cualquiera de los métodos vistos hasta ahora (búsqueda, minimax, poda alfa-beta, expectimax) puede ayudar a encontrar una estrategia. Próxima clase: agentes lógicos.
2 Puntos destacados / Lo que hay que saber
3 Actividades y tareas pendientes
El profesor comenzó la clase con comentarios sobre la Tarea 2, pero el audio de esa parte es ininteligible [parte no entendida].
No se dejó ninguna tarea nueva con fecha de entrega en esta sesión.
Checklist sugerido a partir de lo explicado:
Próxima clase: agentes lógicos.
4 Dudas que podrían examinar
¿Qué es un nodo chance y cómo se calcula su valor?
Un nodo donde el resultado no lo decide un jugador sino el azar. Su valor es la utilidad esperada: V = Σ P(sucesor)·V(sucesor), el promedio ponderado por probabilidades.
¿Cuándo conviene usar expectimax en lugar de minimax?
Cuando no sabemos el resultado de una acción: hay eventos aleatorios, acciones que pueden fallar o adversarios impredecibles. Minimax asume el peor caso y puede ser demasiado conservador.
¿Se puede podar en expectimax como en alfa-beta?
Es mucho más difícil: como toda rama contribuye a la esperanza (aunque sea con probabilidad ínfima), casi nunca se puede descartar una rama con seguridad.
¿Qué es una lotería?
Una situación con resultados inciertos notada L = (p, A; 1−p, B): con probabilidad p se obtiene A y con probabilidad 1−p se obtiene B.
¿Cuáles son los axiomas de racionalidad?
Ordenabilidad (todo es comparable), Transitividad, Continuidad (existe p que iguala una lotería intermedia), Sustituibilidad (indiferentes se pueden sustituir) y Monotonicidad (más probabilidad de lo preferido es mejor).
¿Qué dice el teorema de máxima utilidad esperada?
Si las preferencias cumplen los axiomas, existe una función U con U(A) ≥ U(B) ⇔ A ≽ B y U(lotería) = Σ p·U(s); entonces la acción racional es maximizar la utilidad esperada.
¿Por qué el ejemplo del dinero contradice la teoría?
Prefiero "seguro $3k" y "0.25·$3k" sobre "0.20·$4k" implica, con U($0)=0, que U($3k) > 0.8·U($4k) y 0.8·U($4k) > U($3k) a la vez: una contradicción que muestra que las personas no siempre siguen los axiomas.
5 Sitios o recursos para visitar
El profesor no citó URLs ni plataformas en esta sesión; se trabajó sobre la conferencia "Clase 8: Incertidumbre". Recursos útiles para profundizar:
- Búsqueda expectimax y utilidad esperada — algoritmo de la clase; sus casos de uso y diferencias con minimax (dominio: google.com).
- "Inteligencia Artificial: un enfoque moderno" (Russell y Norvig) — libro base del curso; bloque de incertidumbre, preferencias y utilidades (dominio: google.com).
- Axiomas de racionalidad y utilidad esperada — teoría de decisión bajo incertidumbre (dominio: google.com).
6 Glosario de términos
- Incertidumbre: situación en la que no conocemos el resultado de una acción ni lo que hará el adversario.
- Nodo chance (aleatorio): nodo cuyo resultado lo decide el azar; su valor es la utilidad esperada de sus sucesores.
- Expectimax: algoritmo de búsqueda con adversarios que usa valores esperados en nodos chance y max/min como minimax.
- Valor esperado: promedio ponderado por probabilidades: V = Σ P(s)·V(s).
- Tupla de utilidad: vector de utilidades, una por jugador, en juegos multijugador.
- Utilidad normalizada: utilidad reescalada al intervalo [0,1] para comparar magnitudes.
- Preferencia (A ≻ B): el agente prefiere estrictamente A sobre B.
- Indiferencia (A ~ B): el agente valora A y B por igual.
- Lotería: situación incierta L = (p, A; 1−p, B).
- Axiomas de racionalidad: ordenabilidad, transitividad, continuidad, sustituibilidad y monotonicidad.
- Máxima utilidad esperada (MEU): principio de elegir la acción que maximice Σ p·U(s).
- Función de utilidad: función real U que resume las preferencias del agente.
- Expectiminimax: nombre del algoritmo que intercala nodos MAX, MIN y chance.
- Actitud frente al riesgo: averso (U cóncava), neutral (U lineal) o amante (U convexa).
- Paradoja de Allais: caso donde las preferencias humanas violan los axiomas de la utilidad esperada.
- Reducción de loterías compuestas: una lotería de loterías equivale a la lotería simple con las probabilidades multiplicadas.
7 Mapa mental textual
- Inteligencia Artificial · Clase 8 (Incertidumbre, expectimax y toma de decisiones)
- Incertidumbre
- No conocemos el pensamiento del adversario
- Adversario más capacitado = conservador
- Búsqueda expectimax
- Nodos max/min como minimax
- Nodos chance → utilidad esperada (V = Σ P·V)
- Probabilidades: uniforme, datos o "dadas"
- Poda difícil (toda rama aporta a la esperanza)
- Generalización
- Tuplas de utilidad por jugador
- Cada jugador maximiza su propia utilidad
- Utilidades
- Normalizadas [0,1] · escala según peor/caso medio
- Origen: suma cero (+1/−1), metas del agente, dinero
- Teoría de decisión
- Preferencias (≻, ~) y loterías (p, A; 1−p, B)
- Axiomas: ordenabilidad, transitividad, continuidad, sustituibilidad, monotonicidad
- MEU: elegir la acción que maximiza la utilidad esperada
- Ejemplo del dinero: contradicción en preferencias humanas
- Cierre
- Métodos vistos ayudan a encontrar estrategia
- Próxima clase: agentes lógicos
- Incertidumbre